Back
精读 MM-ACT:在共享离散 token 空间中统一生成任务规划、未来图像与动作,并用 Context-Shared Multimodal Learning 提升机器人控制。
paper deep dive
vla
multimodal generation
robot manipulation